1
Introduction à la Vision par Ordinateur et au Traitement Numérique des Images
PolyU COMP5511Lecture 8
00:00

Introduction à la Vision par Ordinateur et au Traitement Numérique des Images

La Vision par Ordinateur est le domaine de l'intelligence artificielle qui permet aux ordinateurs d'extraire des informations pertinentes à partir d'images et de vidéos numériques, en tentant efficacement de combler le fossé sémantique entre les données brutes de pixels et la compréhension de niveau humain. Le Traitement Numérique des Images sert de couche fondamentale à la Vision par Ordinateur, en se concentrant sur la manipulation et l'amélioration des signaux d'image grâce à des transformations pixel par pixel afin de préparer les données pour des tâches d'interprétation de plus haut niveau.

Principes Clés

  • Représentation des Données : Au niveau machine, une image est un tenseur numérique plutôt qu'une image globale. Les images en niveaux de gris sont des matrices 2D de valeurs d'intensité, tandis que les images en couleur sont des tenseurs 3D représentant les canaux Rouge, Vert et Bleu (RGB) avec des dimensions $H \times W \times 3$.
  • Transformation vs Interprétation : Le Traitement Numérique des Images concerne principalement les opérations d'image à image telles que la réduction du bruit, l'accentuation ou l'égalisation d'histogramme. La Vision par Ordinateur se concentre sur les opérations d'image à connaissance telles que la classification d'objets, la localisation et la segmentation.
  • Le Paradigme de la Graphique Inverse : La Vision par Ordinateur peut être considérée comme l'inverse de l'Infographie. Alors que l'infographie cherche à générer un monde visuel à partir de modèles mathématiques, la vision cherche à reconstituer des structures 3D et des étiquettes sémantiques à partir de projections 2D.
Le Défi Principal
Le principal défi dans ce domaine est le Fossé Sémantique, c'est-à-dire le décalage entre les valeurs de pixels de bas niveau traitées par les machines et les concepts de haut niveau perçus par les humains.
Implémentation Python
Question 1
Quel processus est classé comme une opération d'image à connaissance ?
Le Traitement Numérique des Images
La Vision par Ordinateur
Infographie
Égalisation d'Histogramme
Question 2
Au niveau machine, quelle est la structure de données d'une image couleur standard ?
Matrice 2D
Tableau 1D
Tenseur 3D / Canaux RGB
Liste Chaînée
Étude de Cas : Système de Diagnostic Médical
Lisez le scénario ci-dessous et répondez aux questions.
Un hôpital développe un nouveau système automatisé de diagnostic médical conçu pour analyser les radiographies à la recherche de fractures osseuses potentielles. Le système traite les données brutes des capteurs de l'appareil à rayons X et génère un rapport de diagnostic pour le radiologue.
Q
1. Si le système applique un rehaussement de contraste pour rendre les structures osseuses plus nettes, s'agit-il de Traitement Numérique des Images (DIP) ou de Vision par Ordinateur (CV) ?
Réponse :
Traitement Numérique des Images. Le rehaussement de contraste est une transformation d'image à image qui améliore la qualité visuelle du signal sans extraire de sens sémantique.
Q
2. Si le système signale automatiquement une zone spécifique comme fracture potentielle, quelle tâche effectue-t-il ?
Réponse :
Vision par Ordinateur / Détection d'Objets. Le système interprète le contenu de l'image pour extraire des connaissances de haut niveau (localisation d'une fracture).
Q
3. Pourquoi la réduction du bruit est-elle nécessaire avant d'exécuter un algorithme de détection ?
Réponse :
Pour améliorer la qualité du signal et réduire les faux positifs dans la phase d'interprétation sémantique. Le bruit peut être interprété à tort par les algorithmes de CV comme de véritables caractéristiques ou contours.